# VoskSTT (Движок для оффлайнового распознавания речи)

Интересно стало посмотреть, что сейчас есть для оффлайнового распознавания речи через нейросети.
Алиса из Яндекса подсказала, что существует проект под названием Vosk:
<https://alphacephei.com/vosk/>
Решил прикрутить эту штуку к NVDA, авось кому-нибудь окажется полезно. Результат прикрепляю к данному сообщению.
<https://t.me/nvda_group/60655>

### Порядок установки:

Сначала устанавливается основной движок распознавания (файл VoskSTT.nvda-addon), а затем доустанавливается модель распознавания для целевого языка.

### Использование:

В диалоге «Жесты ввода» в подкатегории Vosk STT назначается свободное сочетание клавиш для команды «Запускает или останавливает распознавание речи».

Теперь после первого вызова этой команды нужно сказать что-нибудь в микрофон по умолчанию, после чего повторным вызовом остановить запись. NVDA произнесет распознанный текст и поместит его в буфер обмена.

Диалог настроек можно открыть через меню NVDA -> СЕрвис -> Настройки Vosk STT. Там можно выбрать модель распознавания, используемый микрофон и включить/отключить звуковой сигнал в начале записи.


### Голосовые модели:

Для работы дополнения используются маленькие голосовые модели средним размером от 30 до 150 Мб.

Модели можно загрузить на сайте разработчика.
<https://alphacephei.com/vosk/models>
На сайте есть большие голосовые модели размером от 1.5 ГБ. и больше.
 
### История версий:

### 2025.10.23

Первоначальный выпуск.
